配套CLI与Skills,浙大开源可插拔Agent评测底座
配套CLI与Skills,浙大开源可插拔Agent评测底座同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。
搜索
同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。
安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。
Shengtao Guo、Ethan X. Fang和Junwei Lu署名的预印本论文宣称利用Odin Automatic AI Research Agent证明了悬而未决40年的Komlós猜想并给出常数界3√(2π),次日陶哲轩等25位菲尔兹奖得主发表联合声明《AI在数学中的严重失准》,警告AI证明速度已远超学界验证与消化的能力。
浙江大学与上海交通大学团队提出Deep Academic Survey(DAS),通过Stateful Agentic框架与DAS-2M文献元数据库,可在1小时内自动生成面向发表的学术综述,在DAS-Bench 30个主题评测中平均得分4.34,并已开放220篇完整Survey供查看。
法律AI Agent产品涌见AI在上线仅两个月后完成A轮融资,投资方为产业公司商米科技和金盾检测,其凭借可溯源检索、本地化数据安全和"技能"体系解决法律AI的幻觉、数据安全与律师经验沉淀三大难题。
字节Seed团队推出Seed-Evolving第五版更新,通过统一Model ID实现周级自动迭代,在Coding Agent长程任务完成度和VLM视觉理解能力上均有显著提升,用户一次接入即可享受模型持续进化。
清华大学AI Agent课题组提出加速扩散语言模型单元测试生成的框架DiffuTester,通过抽象语法树动态挖掘多个测试用例间的共享结构模式,在解码过程中保留相关token,在保持测试覆盖率的同时实现最高约2–3倍加速,相关论文已被EMNLP 2026接收。
近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
一周之内大语言、图片、视频模型都迎来新赛季:OpenAI的GPT-6 Astra让编码 Agent更好地使用游戏引擎和Blender,自己改场景、自己跑、自己测;GPT-image-2.5上线,更快更强,图片编辑和关键帧动画显著提升;fal和Yoroll分别发布 H3 MaxTurbo和H3 Superfast后训练加速模型,5秒视频3秒内推理,实时生成和互动玩法纷纷涌现。
崔添翼最近在 X 上刷屏有点多。9 月 9 日,这位今年 3 月加入 DeepSeek、负责 Agent 运行和评估基础设施的 Harness 团队成员发推称,V4.1 Flash 在性能、费用、速度和总用时等方面全面超过 V4 Pro,因此 V4.1 Flash 上线后、V4.1 Pro 上线前,所有发往 V4 Pro 的请求都会被路由到 V4.1 Flash,按 Flash 的价格计费。